想买一台能跑 13B 大模型的 AI PC,预算定了、品牌选了,但一看规格表——有的标“50 TOPS”,有的标“10 TOPS”,有的只标 CPU 型号压根不提算力。到底跑 13B 模型需要多少算力?内存要多大?买错了会不会跑不动?
这是目前很多企业 IT 采购和个人 AI 开发者最困惑的问题。13B 模型是本地部署的“甜点”规模——能力接近 GPT-3.5/4 早期水平,硬件要求又不像 70B 那样遥不可及。但“甜点”不代表随便一台电脑都能跑——选错配置,要么跑不起来,要么卡得没法用。
跑 13B 模型(Q4 量化版本),推荐 10~20 TOPS(INT8) 的 AI 算力,最低门槛 5~8 TOPS。
| 算力等级 | 13B Q4 推理速度 | 体验评价 |
|---|---|---|
| <5 TOPS | 3~5 tokens/秒 | 不可用,打字速度都比它快 |
| 5~10 TOPS | 6~10 tokens/秒 | 勉强可用,适合批量任务 |
| 10~20 TOPS | 12~25 tokens/秒 | 推荐区间,流畅对话 |
| 20~50 TOPS | 25~40 tokens/秒 | 很流畅,接近云端体验 |
| 50+ TOPS | 40~60 tokens/秒 | 极速,专业级 |
以上为 INT8 量化模型 + 4-bit 量化(Q4_K_M)的实测参考值,不同芯片和软件栈会有差异。
为什么 Q4 量化是首选?
13B 模型 FP16 原始大小约 26GB,Q4 量化后压缩至 7~8GB
推理速度提升 3~5 倍,智能损失仅 5%~10%
绝大多数 16GB 内存设备即可运行(而非 32GB+)
算力决定“跑多快”,内存决定“能不能跑”。这是最容易被忽略的瓶颈。
| 内存容量 | 13B Q4 模型 | 体验 |
|---|---|---|
| 8GB | 无法加载 | 内存不足 |
| 16GB | 可以运行 | 最低门槛,需预留系统内存 |
| 32GB | 流畅运行 | 推荐配置,可同时开其他应用 |
| 64GB+ | 非常充裕 | 可同时跑多个模型 |
实际占用计算:
13B Q4 模型:约 7~8GB
操作系统 + 其他应用:约 4~6GB
推理过程额外开销:约 2~3GB
总计需要:约 14~16GB
结论:16GB 是最低门槛,但 32GB 才真正从容。
选购检查:
内存是否 ≥16GB?
是否支持内存扩展(SO-DIMM 插槽)?——PB1001/PB1201 支持后期升级,优先考虑
TOPS 的定义与精度陷阱
INT8(整数 8 位) :AI 推理最常用精度,TOPS 数值最高
FP16(半精度浮点) :精度更高,算力约为 INT8 的 1/2~2/3
FP32(单精度浮点) :训练常用,算力约为 INT8 的 1/4~1/3
关键提示:部分厂商用 FP16 算力宣传(数字更大),但实际推理用 INT8——两者差距可能达一倍以上。
选购检查:
确认标注的是 INT8 算力还是 FP16 算力
问销售:“持续运行 1 小时后,实际能跑多少 TOPS?”
有算力不等于能用。AI 推理框架(Ollama、LM Studio)对 NPU/GPU 的支持程度不同。
| 算力类型 | 软件兼容性 | 推荐 |
|---|---|---|
| NVIDIA GPU(CUDA) | ⭐⭐⭐⭐⭐ 生态最成熟 | 首选专业 AI 开发 |
| AMD 核显(ROCm/DirectML) | ⭐⭐⭐⭐ 良好 | 性价比之选 |
| AMD NPU(XDNA) | ⭐⭐⭐ 发展中 | 需确认框架支持 |
| Intel NPU | ⭐⭐⭐ 发展中 | 需确认框架支持 |
| ARM NPU(Rockchip) | ⭐⭐⭐⭐ 成熟(需 RKNN) | 边缘计算场景 |
选购检查:
计划使用的 AI 框架是否支持该硬件?
是否有官方驱动和 SDK 文档?
社区是否有足够的技术支持资源?
AI 推理是持续高负载任务(可能持续数十分钟甚至数小时),散热设计决定了设备能“跑多快”能“跑多久”。
| 散热方案 | 持续性能表现 | 适合场景 |
|---|---|---|
| 被动散热(无风扇) | 持续性能较低 | 低功耗设备(<15W) |
| 主动散热(风扇) | 持续性能稳定 | 多数 AI 迷你主机 |
| 大面积散热片 + 风扇 | 持续性能最佳 | 高性能 AI PC |
关键指标:看评测中的“满载 30 分钟温度”和“是否降频”。
选购检查:
满载时 CPU/NPU 温度是否 >85℃?(超过会降频)
满载噪音是否可接受?(办公环境 <40dB)
AI 应用可能需要外接摄像头、多屏显示、高速存储。
| 接口 | 必要性 | 说明 |
|---|---|---|
| USB4 / 雷电 | ⭐⭐⭐⭐ | 外接显卡坞、高速存储 |
| 双网口 | ⭐⭐⭐ | 内网部署、内外网隔离 |
| 多视频输出 | ⭐⭐⭐ | 多屏办公和调试 |
| HDMI 2.1 | ⭐⭐⭐ | 4K@120Hz 显示 |
选购检查:
是否有 USB4/雷电接口?(扩展性)
是否支持双屏或三屏输出?
存储是否可扩展(双 M.2)?
| 设备/配置 | 算力来源 | 13B Q4 速度 | 参考价格 | 综合评价 |
|---|---|---|---|---|
| N100 + 16GB | UHD 核显(~1 TOPS) | 不可用 | ~1500 元 | 跑不动 |
| PB1001(Vega 8 + 16GB) | 核显(~3~4 TFLOPS) | 5~7 tokens/秒 | ¥1,680 | 勉强可用 |
| PB1202(660M + 16GB) | 核显(~5~6 TFLOPS) | 6~9 tokens/秒 | ¥2,600 | 入门可用 |
| PB1301(50 TOPS NPU + 16GB) | NPU(50 TOPS) | 15~22 tokens/秒 | 详询 | 流畅推荐 |
| PB0801(6 TOPS NPU + 6GB) | NPU(6 TOPS) | 5~8 tokens/秒 | ¥1,950 | 需升级内存 |
| RTX 3060 12GB | CUDA | 25~40 tokens/秒 | 详询 | 极速 |
| PB1501(50 TOPS + 128GB) | NPU + 8060S | 20~35 tokens/秒 | 详询 | 旗舰流畅 |
以上为 13B 模型 Q4 量化版本的实测近似值,实际速度受散热、软件版本影响。
| 你的需求 | 推荐配置 | 理由 |
|---|---|---|
| 个人学习 / 偶尔使用 13B | 16GB 内存 + 5~10 TOPS | PB1001 可跑但偏慢,PB1202 更从容 |
| 日常对话 / 高频使用 | 16~32GB 内存 + 10~20 TOPS | PB1301(50 TOPS NPU) 流畅运行 13B |
| 企业内网 AI 部署(多人调用) | 32GB 内存 + 20+ TOPS | 需并发处理能力 |
| AI 开发 + 需要 CUDA | 16GB+ 内存 + RTX 独立显卡 | PB1401(RTX 3060) CUDA 生态完整 |
| 跑 70B 模型 | 128GB 内存 + 50+ TOPS | PB1501(128GB 内存) |
| 政企信创 / 无外网部署 | ARM + NPU + 6GB 内存 | PB0601 适合单路,PB0801 适合多路 |
50 TOPS + 8GB 内存,跑 13B 模型加载失败。算力再强,内存不够就是白搭。
大多数用户对 13B 模型的需求,10~20 TOPS 已足够流畅。更高的 TOPS 意味着更高的价格和功耗,如果不是跑 70B 或高频并发,可能是性能浪费。
买了 NPU 但 Ollama 不支持,结果只能用 CPU 跑,速度还不如核显。买之前确认你用的推理框架是否支持该 NPU。
A:13B Q4 模型推荐 10~20 TOPS。7B 模型推荐 5~10 TOPS,13B 的算力需求约为 7B 的 1.5~2 倍(因参数翻倍、注意力计算更复杂)。
A:够,但偏紧。 13B Q4 模型约 7.5GB,系统 + 其他应用约 4~6GB,剩余空间不多。推荐 32GB 以获得更从容的体验。PB1001/PB1201 支持内存后期升级(双 SO-DIMM)。
A:能,但较慢。 PB1001(Vega 8)约 5~7 tokens/秒,PB1202(Radeon 660M)约 6~9 tokens/秒,属于“可用但不够流畅”的水平。如果需要流畅体验,推荐有 NPU 的型号(PB1301/PB1501)或带独显的型号(PB1401)。
A:
x86+NPU(PB1301/PB1501) :兼容 Windows/Linux,生态更丰富,可同时作为办公电脑使用
ARM+NPU(PB0601/PB0801) :功耗极低(10W),无风扇静音,适合政企无外网和批量部署,但需 ARM 版软件
A:PB1301 搭载 50 TOPS NPU,13B Q4 模型约 15~22 tokens/秒,对话流畅,无明显延迟。
A:70B 模型 Q4 量化后约需 36GB 内存。推荐 PB1501(128GB 内存 + 50 TOPS NPU)——目前 Mini PC 形态中能跑 70B 模型的配置,或选择带多显卡的工作站。
跑 13B 大模型的硬件选型,记住三个数字:
| 配置项 | 最低门槛 | 推荐配置 |
|---|---|---|
| 内存 | 16GB | 32GB |
| AI 算力(INT8) | 5~8 TOPS | 10~20 TOPS |
| 存储 | 128GB SSD | 512GB+ SSD |
华一精品 AI 迷你主机 13B 模型选型推荐:
| 预算 | 推荐型号 | 13B 速度 | 内存 | 特点 |
|---|---|---|---|---|
| ~2,600 元 | PB1202 | 6~9 tokens/秒 | 16GB | 核显方案,入门可用 |
| 详询 | PB1301 | 15~22 tokens/秒 | 16GB | NPU 加速,流畅推荐 |
| 详询 | PB1401 | 25~40 tokens/秒 | 16GB(可升级) | RTX 3060,CUDA 生态 |
| 详询 | PB1501 | 20~35 tokens/秒 | 128GB | 旗舰,可跑 70B |
华一精品科技有限公司(品牌 Adreamer)
成立于 2012 年,14 年智能硬件 ODM/OEM 经验
国家高新技术企业 | 广东省专精特新中小企业
5000+㎡ 自有工厂 | 50+ 研发团队 | ISO9001/14001/BSCI 认证
地址:中国广东深圳市龙岗区宝龙三路 16 号宝龙专精特新产业园 3 栋 3-403
主营:AI 迷你 PC(PB1001/PB1202/PB1301/PB1401/PB1501)、AI 边缘计算盒子(PB0601/PB0801)、AI 智能眼镜、AI 智能玩具等智能硬件 ODM/OEM
跑 13B 大模型,算力 10~20 TOPS 起步,内存 32GB 更从容。